Type: entity
Confidence: 0.70
Created: 2026-04-20
Updated: 2026-04-20
Tags: personcomputer-visionvision-transformer机器学习

Alexey Dosovitskiy

概述

计算机视觉研究者,Vision Transformer(ViT)的主要作者,将 Transformer 架构成功应用于图像识别。

关键内容

  1. ViT 论文(2021):发表《An Image is Worth 16x16 Words: Transformers for Image Recognition》,首次证明纯 Transformer 架构(无卷积)可以在图像分类任务上达到 SOTA。
  2. 图像分块策略:将图像分割为 16×16 的 patch 序列,直接输入 Transformer 编码器,证明了自注意力机制可以处理视觉数据。
  3. 影响:ViT 开启了视觉 Transformer 的研究热潮,后续的 Swin Transformer、DETR 等工作均受其启发。

来源

相关